每次想搭建地端 AI 工作站,硬體規格就是第一個難以跨越的難題,一打開規格表,看到 CPU 幾核、GPU 幾核、頻寬多少 GB/s,滿滿的數字排開,頭都昏了,看了半天也不知道該從何評估起。常常看著看著心累,默默切回雲端 API ...
這次不能再輕易放過自己。既然手邊是兩台既有設備,不用在購物車前猶豫不決,那就乖乖坐下來,搞清楚「這兩台到底能被我榨出多少價值」。
話先說在前頭:這不是跑分實測文,今天看不到任何效能圖表。今天要做的事很單純:看官方釋出的數據,釐清哪些數字是決定 Local Agent 跑得順不順的關鍵因子,哪些純粹只是印在包裝盒上好看而已。
挑硬體大家最先盯著看的通常是 CPU、GPU 核心數。核心多,理論峰值當然漂亮,但那比較像是「天花板」,不代表日常巡航速度。尤其是跑 Agent 這種負載,動不動就呼叫模型、等 Tool 回傳、再來回迭代,瓶頸往往根本不在算力上限。
比算力更早遇到瓶頸的,永遠是記憶體:
手邊這台是滿血版:16 核心 CPU(12P + 4E)、40 核心 GPU,附帶 16 核心 Neural Engine。翻了 Apple 規格才發現,64GB 統一記憶體剛好綁定在這個晶片級別,記憶體頻寬來到 400GB/s。
推論生態主要是 llama.cpp跟 Apple 自家的 MLX。它沒有硬體級的極低位元加速電路,量化推論基本得靠軟體層硬扛。
這台搭載 NVIDIA GB10 Grace Blackwell Superchip,CPU 給了 20 核心 Arm,GPU 則是 Blackwell 架構配第五代 Tensor Core。記憶體配了 128GB LPDDR5x,頻寬為 273GB/s。官方標榜 FP4 精度下算力峰值可達 1 petaFLOP,號稱單機最高能吃下 200B 參數的模型。
系統走的是專為 AI 打造的 NVIDIA DGX OS,底層是熟悉的 Ubuntu Linux。軟體生態毫無懸念是標準 CUDA 全家桶——vLLM、TensorRT-LLM、llama.cpp 隨插隨用;更關鍵的是它自帶 FP4 Transformer Engine 原生硬體支援,這是 Mac 無法享有的優勢。
| 項目 | MacBook Pro (M3 Max) | ASUS Ascent GX10 |
|---|---|---|
| CPU | 16 核心 (12P + 4E) | 20 核心 Arm |
| GPU | 40 核心 | Blackwell 架構 (第 5 代 Tensor Core) |
| 記憶體容量 | 64GB | 128GB |
| 記憶體頻寬 | 400GB/s | 273GB/s |
| 架構機制 | SoC 內部實體統一記憶體 | Grace-Blackwell (NVLink-C2C 橋接) |
| 低位元硬體支援 | 軟體模擬 | 原生 FP4 Transformer Engine |
| 作業系統 | macOS | DGX OS (Ubuntu-based) |
| 主流推論框架 | llama.cpp / MLX | vLLM / TensorRT-LLM / llama.cpp |
以上這些,終究都是印在規格表、寫在官網頁面上的紙上談兵。GX10 帳面看起來像是全面壓制,但那份優勢能不能真的落地,還得看軟體生態撐不撐得起來、實際部署會不會卡關;Mac 那個「頻寬領先」的小驚喜,也可能在真正跑起模型之後,被其他沒列在規格表上的因素抵銷掉。
帳面規格說到底只是預測,不是答案。這兩台設備真正的實力差距,得等實際把模型跑起來、量出數據之後才算數——這部分,就留到後面幾天慢慢揭曉。